Índice · Visión Computacional

Visión Computacional

Clase 2 · Introducción a la visión computacional: aplicaciones, redes neuronales y escala

Fecha: 12 de agosto de 2026

Resumen de la clase

1 Contenido de la clase

Organización del curso y del laboratorio [02:24-09:00]

El profesor pertenece a un laboratorio de investigación de visión computacional ubicado en el edificio de la Facultad de Ingeniería (de la Facultad de Computación). En la página web del laboratorio se muestran los proyectos y las materias que imparten, y hay una sección de bibliografía recomendada con libros clásicos del área, incluido el del llamado "padre de la visión computacional" (David Marr), quien propuso los primeros modelos conceptuales de cómo resolver problemas de visión por computadora [04:27].

Prácticas: se trabajan en equipos de hasta 4 personas. Entregables: reporte impreso (con carátula con nombres y título, para que el profesor haga anotaciones), presentación y código (Python o MATLAB) [07:41]. Cada integrante debe subir su reporte individual aunque el código sea compartido; los equipos son reconfigurables [06:25].

Proyecto final: se deja unas semanas antes de terminar el curso; es menos dirigido que las prácticas (tipo reto: plantean un problema y hay que resolverlo con lo aprendido y lo investigado). Su fecha de entrega cae en período de finales, no en el primer final [05:55].

¿Qué es la visión computacional? [20:24-21:35]

La visión computacional y la inteligencia artificial son áreas muy entrelazadas. El reto general es aislar los objetos de interés de una imagen. Decir dónde está la figura humana en una escena es relativamente fácil; lo difícil es dar una interpretación semántica completa de la imagen (el profesor puso el ejemplo de una escena con elementos de cultura mexicana relacionada con el Día de Muertos [parte no entendida en los detalles de la escena]). Los retos actuales ya no se limitan a escenas cotidianas: se trabaja con los tipos de imágenes más complejos.

Aplicaciones en las que trabaja el laboratorio [21:48-27:23]

  • Imagen médica: resonancia magnética (MRI) del corazón; se sigue el movimiento del ventrículo izquierdo a lo largo de la sístole para detectar isquemia o riesgo de infarto [22:06]. También fusión de imágenes anatómicas y funcionales en una sola [22:18], segmentación de estructuras del cerebro (una pequeña estructura descrita como "rojiza", cuyo nombre no se entiende bien en la transcripción, que interesa a quienes estudian el Parkinson, pues el cambio de volumen de esa estructura a lo largo del tiempo es un indicador de riesgo) [22:41], y reconstrucción 3D (por ejemplo de un cráneo) partiendo de la imagen segmentada y de su malla [22:57].
  • Percepción remota (teledetección): observar la Tierra desde satélites. Los satélites pasivos capturan la luz solar reflejada por los objetos (cámaras, bandas del espectro); los satélites activos emiten su propia onda electromagnética (como un radar/ultrasonido) que rebota en la superficie y da información de las propiedades y la morfología; los activos pueden atravesar las nubes [23:17]. La reflectancia espectral cambia según el estado de la vegetación (una planta sana refleja distinto que una que se está muriendo) [24:17]. Ejemplo de aplicación: el hielo panqueque (pancake ice), discos redondos de hielo de 30 cm a 3 m que se forman en los polos al congelarse el agua en movimiento y que sirven como indicador de cuánto se está congelando o deshielando una zona [24:32].
  • Marcas de agua: insertar una marca de agua invisible en imágenes para proteger los derechos de autor; debe poder extraerse para comprobar el origen de la imagen o del video sin degradar la calidad [25:19]. El profesor comenta que también se insertan marcas de agua en el texto generado por asistentes (chat) para poder rastrear su origen [25:41].
  • Computación cuántica + machine learning: área emergente que ya se trabaja en el laboratorio para procesamiento de imágenes [26:19].
  • Imágenes industriales / retail: auditoría de anaqueles (estantes de supermercado). Las marcas pagan porque su producto esté bien acomodado; en lugar de recorrer la tienda, se toma una foto del estante, el sistema identifica automáticamente cada producto y lo compara con el planograma (cómo debería estar acomodado) [26:35].

Flujo de trabajo y la importancia del preprocesamiento [27:23-28:40]

Esquema general: se tienen datos (imágenes), se fabrica un modelo, se prueba con datos y se aplica. Vale tanto para modelos clásicos como para deep learning [27:23].

Idea clave: los fans de las redes neuronales creen que basta meter la imagen cruda a la red, pero muchas veces conviene preprocesar la imagen (quitar ruido, objetos no deseados, etc.). Así el modelo puede ser más pequeño y funciona mejor. La preparación de datos es muy importante en esta materia [27:59].

Historia de las redes neuronales: ¿por qué funcionan ahora? [28:45-44:11]

  • Las redes neuronales no son nuevas: existían desde los años 50 [29:00]. Las primeras eran sistemas lineales (valores ponderados que se suman y pasan a la siguiente capa), por lo que no podían implementar la compuerta XOR; los detractores las retaron con ese problema. La solución fue añadir funciones de activación no lineales, y a partir de ahí pudieron resolver problemas más complejos [29:11].
  • No tuvieron impacto antes porque faltaba hardware: entrenarlas tomaba años de cómputo [29:49].
  • El despegue llegó con datos masivos etiquetados (el profesor se refiere a conjuntos como ImageNet, aunque el nombre exacto no se distingue bien; menciona que cada clase tenía de ~1,000 a ~10,000 imágenes, p. ej. gatos en distintas poses) [40:00]. Con estos datos, el entrenamiento pasó de años a días. Los datos abundan en imágenes naturales; el reto aparece en imágenes médicas, donde los datos son escasos y difíciles de etiquetar [41:23].
  • Hito: en 2015 una red convolutional se desempeñó mejor que un humano en una tarea de clasificación de imágenes en la que el humano comete alrededor de 5 % de error [42:18].
  • Las redes neuronales son una emulación muy simplificada del cerebro: las neuronas reciben información de otras, la procesan (función de activación) y la pasan [41:42].

Convoluciones y visión humana [43:15-44:33]

La convolución es la operación que permite implementar filtros (lineales, en 1D, 2D o 3D) [43:17]. El sistema visual humano, desde la retina hasta las células de la corteza visual, tiene filtros: las primeras capas de la corteza extraen características fundamentales (bordes, texturas) que pasan a capas más profundas [43:35].

Las redes convolutionales (CNN) funcionaron porque agregaron etapas convolucionales que emulan lo que hace nuestra visión. Por eso este curso hará mucha referencia a la visión humana: se estudiará tanto el procesamiento clásico (anterior a las redes) como el procesamiento moderno, y ambos son importantes [44:11].

Dalí y la percepción multiescala (ejemplo) [44:35-46:00]

Antes de que se formalizara la visión computacional, los artistas ya exploraban la percepción. El profesor mostró la obra de Salvador Dalí "Gala desnuda mirando el mar" (Gala mirando el mar Mediterráneo que, a 18-20 metros, se transforma en el retrato de Abraham Lincoln; homenaje a Rothko), de 1975-76, de la que existen varias versiones en Cataluña [44:39].

La idea: al alejarse de la pintura, el espectador deja de ver a Gala y comienza a ver el rostro de Lincoln; al acercarse, vuelve Gala. Es un ejemplo perfecto de cómo cambia lo que percibimos según la escala. El profesor contó que Dalí se puso a estudiar el trabajo de un pionero del reconocimiento de rostros (el nombre no se entiende con claridad en la transcripción; se trata del retrato pixelado de Lincoln de Leon Harmon, Bell Labs, publicado en Scientific American, 1973, que inspiró la obra) [45:07].

El reto de la clase: extraer contornos y el concepto de escala [46:22-49:16]

Reto propuesto: siendo "expertos en visión de máquinas", extraer los contornos del rostro de una imagen con técnicas de detección de bordes, p. ej. con el filtro de Sobel (operador de 3×3) [46:33]. Con Sobel se encuentran muchos bordes (cabellos, contornos, etc.), pero se pierden detalles: el filtro de Sobel no basta [47:05].

¿Cómo lo hacemos los humanos? Entornando los ojos: al cerrarlos un poco, la imagen se ve borrosa (baja resolución) y se aprecian las estructuras grandes. También mirando con la visión periférica. El sistema visual tiene varios canales de resolución [47:17].

Para encontrar el contorno del rostro conviene bajar la resolución de la imagen. Ejemplo: una planta — a baja resolución ya no se ven las hojas individuales (la hoja es "una cosita"); a alta resolución se pierde la estructura general. Esto es el concepto de escala: ¿a qué escala quieres trabajar? [48:11].

Procesamiento jerárquico y filtros del cerebro [49:20-62:58]

El sistema visual es jerárquico: las capas externas hacen operaciones simples sobre características básicas, y las capas profundas hacen operaciones complejas como el reconocimiento de personas [49:34]. Existen campos receptivos (células especializadas) en la retina y en la corteza visual, y se ha propuesto su modelo matemático [60:07].

Las funciones de Gabor (una envolvente gaussiana combinada con una oscilación) modelan las células simples de la corteza. Las derivadas de la gaussiana (primera y segunda derivada, en una o en dos direcciones) producen funciones muy parecidas a los campos receptivos y son operadores para detectar/extractar bordes y contornos [60:41]. Estas funciones se representan como imágenes en escala de grises (blanco = máximo, negro = mínimo) [61:14].

Conclusión: en la cabeza tenemos filtros "óptimos" para extraer las características de las imágenes; los modelos matemáticos de la visión humana coinciden con los mejores filtros para procesar imágenes [62:31].

Cómo se entrena una red neuronal [63:01-63:52]

Proceso: la red se inicializa con valores aleatorios, se le pasa un dato, se compara su salida con la esperada, el error define una función de costo, y mediante gradiente descendente se van encontrando los valores (pesos) que minimizan ese error [63:21].

Como hay millones de parámetros, se necesitan muchos datos de entrenamiento. El diseñador solo define la arquitectura; los valores los encuentra la optimización matemática [63:34]. Dato notable: cuando se entrena una CNN, los filtros convolucionales aprendidos en las primeras capas se parecen mucho a los filtros óptimos de la corteza visual, lo que confirma que son los filtros adecuados para procesar imágenes [63:39].

2 Puntos destacados / Lo que hay que saber

El reto de la visión computacional: aislar los objetos de interés y dar una interpretación semántica de la imagen [20:32].
Aplicaciones: imagen médica (MRI, fusión, segmentación, reconstrucción 3D), teledetección (satélites activos/pasivos), marcas de agua, retail (auditoría de anaqueles con planograma) y computación cuántica + ML.
La convolución es la operación que implementa filtros; las CNN emulan la visión humana [43:17].
Historia: las redes existían desde los años 50; eran lineales y no podían hacer XOR; se resolvió con funciones de activación no lineales; el límite era el hardware [29:11].
En 2015 una CNN superó al humano en clasificación de imágenes (error humano ≈ 5 %) [42:18].
Preprocesamiento de datos: muchas veces rinde más que agrandar el modelo [27:59].
El sistema visual tiene filtros en retina y corteza; funciones de Gabor y derivadas gaussianas son operadores de bordes [60:41].
Concepto de escala: bajar la resolución (entornar los ojos) revela estructuras grandes [47:17].
Filtro de Sobel (3×3): detecta bordes pero no basta para extraer todos los contornos [47:05].
Entrenamiento de redes: función de costo + gradiente descendente; millones de parámetros → muchos datos [63:21].
Dalí, "Gala mirando el mar" → Abraham Lincoln: la percepción cambia con la escala [44:39].

3 Actividades y tareas pendientes

Tareas y compromisos mencionados en esta clase (marcá lo que ya cumpliste):

4 Dudas que podrían examinar

¿Cuál es el reto principal de la visión computacional?

Aislar los objetos de interés de una imagen y, más difícil aún, dar una interpretación semántica completa de la escena. La visión computacional y la IA son áreas muy entrelazadas.

¿Qué diferencia hay entre un satélite pasivo y uno activo?

El pasivo solo recibe la luz solar reflejada (no emite; es como una cámara que ve); el activo emite su propia onda electromagnética que rebota en la superficie (como un radar/ultrasonido), puede atravesar las nubes y aporta información de las propiedades y la morfología.

¿Por qué las redes neuronales no triunfaron antes?

Por dos razones: las primeras eran sistemas lineales (no podían implementar la compuerta XOR) y faltaba hardware para entrenarlas en tiempos razonables; el despegue llegó con potencia de cómputo y datos masivos etiquetados.

¿Por qué una CNN emula la visión humana?

Porque incluye etapas convolucionales que extraen características de menor a mayor complejidad, igual que la retina y la corteza visual: las primeras capas detectan bordes y texturas, y las profundas hacen tareas complejas como el reconocimiento de personas.

¿Qué es el concepto de escala?

Trabajar con una imagen a diferentes resoluciones. A baja resolución se ven las estructuras grandes (como entornar los ojos para distinguir el contorno del rostro), mientras que a alta resolución dominan los detalles pequeños (las hojas de una planta).

¿Qué es una función de Gabor y por qué importa?

Es una función 2D formada por una envolvente gaussiana multiplicada por una oscilación. Modela los campos receptivos de las células simples de la corteza visual, y sus derivadas sirven como operadores para detectar bordes y contornos.

¿Cómo se entrena una red neuronal?

Se inicializan los pesos con valores aleatorios, se compara la salida con la esperada mediante una función de costo y se optimizan los parámetros con gradiente descendente. Solo se diseña la arquitectura; los valores los encuentra la optimización.

¿Por qué los filtros aprendidos se parecen a los de la corteza visual?

Porque el proceso de optimización converge a filtros "óptimos" para extraer características de las imágenes: los mismos que la visión humana fue descubriendo. Es otra confirmación de que son los filtros adecuados para procesar imágenes.

5 Sitios o recursos para visitar

  • "Vision" de David Marr — El libro del considerado "padre de la visión computacional", con los primeros modelos conceptuales de cómo resolver problemas de visión (dominio: google.com).
  • Pattern Classification (Duda, Hart y Stork) — Clásico de reconocimiento de patrones mencionado en la bibliografía del laboratorio (dominio: google.com).
  • ImageNet — Conjunto de datos masivo con etiquetas (miles de imágenes por clase) usado para entrenar redes (dominio: image-net.org).
  • Fundació Gala-Salvador Dalí — La obra "Gala mirando el mar Mediterráneo… Abraham Lincoln" y sus versiones (dominio: salvador-dali.org).
  • "The Recognition of Faces" de Leon Harmon — El retrato pixelado de Lincoln (Bell Labs, 1973) que inspiró a Dalí (dominio: google.com).
  • Filtro de Sobel — Operador de 3×3 para detección de bordes (dominio: es.wikipedia.org).
  • Filtro de Gabor — Función gaussiana × oscilación que modela los campos receptivos de la corteza (dominio: es.wikipedia.org).
  • Hielo panqueque (pancake ice) — Discos de hielo polar usados como indicador de congelación/deshielo (dominio: es.wikipedia.org).

6 Glosario de términos

  • Visión computacional: área que enseña a las computadoras a analizar imágenes, muy ligada a la inteligencia artificial.
  • Interpretación semántica: entender el significado completo de una escena (qué hay, quién, qué ocurre), no solo localizar objetos.
  • Fusión de imágenes: combinar imágenes de distinto tipo (p. ej. anatómica y funcional) en una sola para el diagnóstico.
  • Segmentación: dividir la imagen en regiones de interés (p. ej. una estructura cerebral o un órgano).
  • Isquemia: falta de riego sanguíneo en el músculo cardíaco; detectable por el movimiento del ventrículo.
  • Percepción remota / teledetección: análisis de la Tierra con sensores a distancia (satélites).
  • Satélite pasivo: captura la luz solar reflejada por los objetos; no emite energía.
  • Satélite activo: emite su propia onda electromagnética (tipo radar) y mide el rebote; atraviesa nubes.
  • Reflectancia espectral: cómo una superficie (p. ej. una planta) refleja la luz en distintas bandas; cambia con el estado de salud.
  • Hielo panqueque (pancake ice): discos redondos de hielo polar que indican congelación o deshielo de una zona.
  • Marca de agua invisible: información oculta insertada en una imagen para proteger derechos de autor y comprobar origen.
  • Planograma: el plano de cómo deben acomodarse los productos en un anaquel; se verifica con visión computacional.
  • Preprocesamiento: preparar la imagen (quitar ruido, etc.) antes de meterla al modelo; mejora el resultado.
  • Compuerta XOR: operación lógica no separable linealmente; motivo por el que las primeras redes lineales fallaron.
  • Función de activación: no linealidad que aplica cada neurona y permite a la red resolver problemas complejos.
  • Convolución: operación matemática con la que se implementan los filtros de una CNN (1D, 2D o 3D).
  • Filtro de Sobel: operador de 3×3 para detectar bordes; no basta para extraer todos los contornos.
  • Escala: nivel de resolución con el que se analiza la imagen; a baja resolución dominan las estructuras grandes.
  • Campo receptivo: región de la retina/corteza a la que responde una célula; se modela con funciones de Gabor.
  • Función de Gabor: envolvente gaussiana × oscilación; modelo de las células simples de la corteza visual.
  • Gradiente descendente: método de optimización con el que se ajustan los pesos de una red minimizando la función de costo.
  • Función de costo: medida del error entre la salida de la red y el resultado esperado.

7 Mapa mental textual

  • Visión Computacional — Clase 2 (Introducción)
    • Organización: Laboratorio de visión · prácticas (equipos ≤4: reporte impreso + presentación + código) · proyecto final en finales
      • Reportes individuales; equipos reconfigurables
    • Qué es: VC e IA entrelazadas → reto: aislar objetos e interpretar semánticamente
      • Aplicaciones: imagen médica (MRI, fusión, segmentación, reconstrucción 3D) · teledetección · marcas de agua · retail (planograma) · computación cuántica + ML
    • Historia: Redes desde los 50 → lineales (XOR imposible) → activación no lineal → faltaba hardware → datos masivos (ImageNet) → 2015: CNN supera al humano (~5 % error)
      • Preprocesamiento de datos: modelo más pequeño y mejor
    • Visión humana: Retina → corteza visual (filtros, campos receptivos) → capas: externas simples, profundas complejas
      • Funciones de Gabor y derivadas gaussianas = operadores de bordes/contornos
      • CNN: etapas convolucionales que emulan la visión humana
    • Escala: Entornar los ojos / bajar resolución → ver estructuras grandes (rostro); planta: hojas vs. estructura; Dalí "Gala → Lincoln"
      • Filtro de Sobel 3×3: detecta bordes pero no basta
    • Entrenamiento: Inicialización aleatoria → función de costo → gradiente descendente → millones de parámetros → muchos datos
      • Filtros aprendidos ≈ filtros óptimos de la corteza visual

Notas de estudio